Skip to content

AI Infra 专栏导览 ​

标签
AI/infra
字数
797 字
阅读时间
4 分钟

本目录收模型跑在真实硬件上的那一层。它是 AI/ 下的一棵子树,按「一条链 + 一篇横切」组织:

位置收什么
gpu/硬件本身 —— 架构、存储层次、算力与带宽、多卡互联拓扑
cuda/在硬件上写 kernel —— 编程模型、访存优化、经典算子
train/用多块硬件训练 —— 框架、切分策略、通信、显存账本
infer/把模型服务出去 —— 调度、显存管理、推理引擎、端侧
01-数值计算与精度横切篇 —— 浮点格式、舍入、溢出下溢、混合精度与 Loss Scaling

前四块是一条链:硬件 → 在硬件上写算子 → 训练 → 服务。 第五块不在链上 —— 它讲的是「前面所有公式在有限精度下会怎么失真」,被四块同时引用,所以放在这一层而不是任一子目录里。

它与相邻专栏的边界是关注点而不是技术栈:

不收去哪看本专栏只关心
机器学习算法与数学基础AI/ml/这些算法跑在真实硬件上要付什么代价
模型本身 —— 架构、分词、位置编码、采样、缩放法则、幻觉AI/llm/模型怎么跑起来 —— 显存、调度、算子、训练、部署
模型怎么被组织成应用 —— 循环、工具、协议、上下文、评测AI/agent/模型运行的物理层

边界不是绝对的,同一对象常在两个层次各有一篇。10-KV Cache 与推理优化 算的是 KV Cache 的显存账本和注意力布局(模型侧:为什么它这么大、怎么让它变小);infer/ 里的 02-PagedAttention:KV Cache 的分页管理 讲的是引擎怎么把这块显存管起来(infra 侧:块表、引用计数、抢占)。

相关 ​

参考 ​

本专栏的推理优化与分布式训练部分整理自 AIInfraGuide,按概念颗粒度重新组织;承重的量化断言逐条核对到一手来源,核对结果与出处写在各篇的 ## 参考。

贡献者 ​

文件历史 ​